«Яндекс» представил первые духовно-нравственные тесты для ИИ


Как сообщает «Коммерсантъ», на совещании рабочей группы по регулированию и административным барьерам ИИ 13 августа «Яндекс» представил концепцию национального датасета — набора тестовых заданий и эталонных данных для бенчмарк-тестирования моделей. Бенчмарк — стандартизированный набор контрольных заданий с эталонными ответами для тестирования ИИ‑моделей, позволяющий сравнивать качество разных моделей по единым критериям.

В ходе обсуждения возник спор о формате доступа к датасету. ФСБ выступает за закрытый формат, чтобы исключить возможность подстройки моделей под тесты; представители бизнеса считают, что закрытость усложнит развитие решений, и предлагают сохранить публичный доступ. В качестве компромисса предложен комбинированный подход: открытый бенчмарк — для предварительной проверки и прозрачности, закрытый — для финальной оценки (с идентичными тематиками, но разными формулировками вопросов).

Остаётся нерешённым вопрос о формировании содержания бенчмарка. ИТ‑сообщество предлагает создать совместную комиссию с участием госорганов, бизнеса и экспертных организаций для обеспечения сбалансированности набора.

В аппарате вице‑премьера Д. Григоренко отмечают, что предложения находятся на стадии обсуждения с отраслью и ведомствами; в Минцифры подчёркивают, что подзаконные акты к закону об ИИ ещё прорабатываются с бизнесом — ключевая задача состоит в соблюдении интересов отрасли и пользователей при соответствии технологий законодательным требованиям.

Эксперты указывают на специфику тестирования ИИ: из‑за взаимовлияния разных частей поведения модели релизный цикл занимает недели, а многократная пересдача существенно его удлиняет. Также отмечается, что публичные бенчмарки со временем могут быть скомпрометированы, поэтому закрытые эталонные ответы необходимы для безопасности. При этом подчёркивается различие двух типов заданий: для задач с однозначным ответом (программирование, математика) возможен чёткий эталон, а для оценки соответствия ценностям требуется экспертная или рубрикаторная оценка — соответственно, требования к прозрачности в этих случаях должны различаться.

Подробности в материале «Коммерсанта»


Рубрика: Новости

Дата: 17-08-2026

Теги: Искусственный интеллект (ИИ) Яндекс